Aggregate benchmark scores obscure patient safety implications of errors across frontier language models
先行研究は、医療関連のクエリに対する最先端言語モデルの総合的なベンチマークスコアが、過少トリアージや過大トリアージなどの臨床的に重要な誤りの方向性や文脈バイアスを捉えきれないことを示し、モデルの安全性評価には集約精度だけでなく誤りの質的プロファイルの分析が必要であることを明らかにしました。